37 课程综合实训项目
本章定位(必修收口):本章是完成必修主线(第1—29、33—36章)之后的整合性课程项目。它不设平台任务、不进入教学平台判定,也没有标准答案,鼓励多种解法与差异化选题;三条赛道任选其一,把必修环节训练出的清洗、聚合、可视化与结论能力整合成一份完整的分析报告,作为 33 个必修实训章节之外的综合项目收口。
37.1 项目目标
完成本项目后,你应能独立交付一份可复现的数据分析报告。自查清单:
37.2 可选赛道
三条赛道任选其一,选题确定后原则上不再更换。每条赛道给出业务场景、本地可运行的数据获取路径与核心研究问题;研究问题可在示例基础上自行细化,但难度不得低于示例。
37.2.1 赛道一:零售复购与销售结构(基于第 章节 22 章与第 章节 26 章同型数据思路)
业务场景:你是零售电商的数据分析实习生,管理层需要一份”销售结构 + 复购”诊断报告,用于决定下一季度的品类投入与促销预算分配。
数据获取路径(本地可运行,三选一):
- 公开数据集:Tableau 示例数据集 “Superstore”(零售订单明细,含订单日期、客户、品类、销售额、折扣、利润等字段,与第 章节 26 章平台数据同型),或 Kaggle 公开数据集 “Walmart Store Sales”(门店周度销售,与第 章节 22 章平台数据同型);
- 内联合成数据:参照第 章节 26 章本地演练版的做法,自建 200—500 行同结构合成订单表,并在报告中明确标注为合成数据、说明其局限;
- 在教学平台环境内完成时,可直接使用平台内置的
superstore.xlsx,但平台结果不用于本地复现。
核心研究问题(示例):
- 品类结构:各品类/Sub-Category 的销售额与利润贡献是否匹配?哪些品类”增收不增利”?
- 折扣与利润:折扣档位与利润的关系是否存在由正转负的拐点(参照第 章节 26 章的 Profit_p_p 口径与样本量过滤)?
- 复购:头部客户/门店贡献了多少比例的销售额?客户购买的集中度如何?
37.2.2 赛道二:金融组合风险与相关性(基于第 章节 21 章、第 章节 34 章与第 章节 36 章思路)
业务场景:你为一只拟配置 3—6 只资产的小型组合撰写风险诊断简报,回答”这组资产放在一起,风险是被分散了还是被放大了”。
数据获取路径(本地可运行,三选一):
- OSS 直链:第 章节 36 章平台任务代码块内含两个可联网直读的 OSS 直链(黄金期货日线、美国十年期国债收益率日线,具体 URL 见该章平台原始代码块),本地可直接复现;
- 行情接口:参照第 章节 34 章,用 Tushare
index_daily接口获取 3—6 只指数的日线收盘价(需自备 token;接口权限不足时改用路径 1 或 3); - 内联合成数据:构造 3—6 列、约 250 行的合成日收益率矩阵(如
np.random.multivariate_normal),仅用于演示组合方差与相关性的统计性质,报告中必须标注为合成数据。
核心研究问题(示例):
- 相关性矩阵:以对数收益率计算相关系数矩阵,哪两类资产相关性最高/最低?与资产类别直觉是否一致?
- 分散化效果:用 \(\sigma_p^2 = \sum_i \sum_j w_i w_j \sigma_i \sigma_j \rho_{ij}\) 计算等权组合方差,并与”各资产方差的平均”对比,量化分散化收益;
- 相关性的稳定性:滚动窗口(如 60 日)相关性是否稳定?市场大幅波动期相关性是否上升(参照第 章节 34 章”相关性的不稳定性”)?
37.2.3 赛道三:跨境贸易结构分析(基于第 章节 25 章与第 章节 27 章思路)
业务场景:你为一家出口企业做贸易伙伴结构分析,回答”我们的出口/进口集中在哪些伙伴、这一结构在改善还是恶化”。
数据获取路径(本地可运行,三选一):
- 公开数据集:联合国商品贸易统计数据库 UN Comtrade(可下载按伙伴国分列的年度进出口额),或中国海关总署公开的月度进出口统计;
- 内联合成数据:参照第 章节 27 章本地演练版的做法,自建”国家×年份×贸易额”的内联合成长表(结构同第 章节 25 章的
sk2018-2010_export.csv),并标注为合成数据; - 平台内置的
sk2018-2010_export.csv/sk2018-2010_import.csv仅在教学平台环境可用,不用于本地复现。
核心研究问题(示例):
- 伙伴集中度:CR3/CR5(前 3/前 5 大伙伴的出口额占比)在样本期内的变化趋势;
- 伙伴类型区分:哪些伙伴稳步增长、哪些大起大落(参照第 章节 25 章的双向趋势对比与子图组织);
- 进出口结构差异:同一伙伴在出口侧与进口侧的地位是否一致?顺差/逆差主要来自哪些伙伴?
37.3 交付物清单
一份可复现的项目材料包,最低要求:
- 数据质量说明与清洗日志:发现了哪些问题(缺失、重复、单位不一致、格式错误、逻辑错误)及各自的处置方式与处置量;
- 不少于 3 张图:每张图配一句结论——一句话说清这张图支持什么判断;图型选择需与问题匹配(参照第 章节 20 章的选型要点);
- 不少于 1 个分组聚合表:至少含一个比率型指标(占比、增长率或率指标),并写明分子分母口径;
- 约 300 字商业结论:含数据口径声明(数据来源、时间窗、样本范围)与局限说明(样本量、合成数据、“相关不等于因果”等)。
37.4 评分量表
| 评分维度 | 权重 | 评分要点 |
|---|---|---|
| 数据严谨 | 30% | 清洗日志完整、口径声明清楚、无未说明的数据取舍 |
| 方法正确 | 30% | 分组聚合与指标构造正确、比率分母合理、图型与问题匹配 |
| 图有效性与可读性 | 20% | 每张图有一句结论、坐标轴/图例/单位完整、脱离正文可独立读懂 |
| 结论逻辑与商业价值 | 20% | 结论有数据支撑、含局限说明、给出可执行的业务建议 |
| 合计 | 100% | 四个维度独立打分后加权求和,得到总分 |
说明:四个评分维度的权重合计为 100%(30% + 30% + 20% + 20%);按百分制对各维度分别打分后加权汇总。
37.5 实施建议与学术诚信
节奏建议(2—4 周):
- 第 1 周:选题与取数——确定赛道与研究问题,完成数据获取,写出数据质量说明初稿;
- 第 2 周:清洗与探索——完成清洗日志、核心分组聚合表与图的初稿;
- 第 3 周:成稿——补齐口径声明,撰写约 300 字商业结论,对照评分量表自评并修改;
- 第 4 周(弹性):迭代——根据自评或同伴互评补做稳健性检验(如更换样本量过滤阈值、更换时间窗、更换口径重算)。
允许工具:Python 标准库与本书主线用到的 NumPy、Pandas、Matplotlib、Seaborn(建议在 peter 环境或自行安装的 Anaconda/Miniconda 环境中用 Jupyter 逐块运行);可查阅官方文档与本书各章内容;如使用 AI 辅助工具,须在报告中声明使用范围与方式。核心分析不得由他人代做。
独立完成声明:提交材料须附一句独立完成声明,例如:“本项目的数据获取、代码、图表与结论由本人独立完成,AI 工具仅用于 ____(如:语法查询/绘图美化),未复制他人成果。”使用合成数据、引用他人代码片段或任何外部资料,均须在报告中注明来源。
37.6 本章小结
本章是全书唯一的项目型章节:没有平台任务与标准答案,交付物清单替代练习题,评分量表替代平台判定,多条解法并存是常态而非例外。它检验的是必修主线 33 个实训章节训练出的完整能力链——提出业务问题、取数与清洗、正确聚合、有效可视化、有口径意识的商业结论。完成本章交付物,即完成本课程的收口。